Type: concept
Confidence: 0.90
Created: 2026-04-26
Updated: 2026-04-26
Tags: 注意力机制深度学习多头机制AI工程

Multi-Head Attention

概述

一种扩展的注意力机制,将查询、键和值分别投影到多个不同的子空间中,在每个子空间独立执行注意力计算,最后将结果拼接起来,增强了模型的表达能力。

关键内容

  1. 计算过程
  2. 将 Q、K、V 分别投影到 h 个不同的低维子空间
  3. 在每个子空间独立执行注意力计算:head_i = Attention(Q W_i^Q, K W_i^K, V W_i^V)
  4. 拼接多头输出:Concat(head_1, ..., head_h) W^O

  5. 技术参数

  6. 论文中使用 h = 8 个注意力
  7. 每个头的维度为 d_k = d_v = d_model / h = 64
  8. 保持总体计算成本与单头相近

  9. 优势特点

  10. 能够在多个表示子空间中学习不同的注意力模式
  11. 不同的头可以关注不同类型的关系(语法、语义、位置等)
  12. 显著增强了模型的表达能力

来源

相关